스노클 AI, 기업가치 3배 급등한 35억 달러로 평가받으며 3억 5천만 달러 투자 유치
AI 학습 데이터 구축 스타트업 스노클 AI(Snorkel AI)가 인사이트 파트너스와 S32 주도로 3억 5천만 달러 시리즈 E 투자를 유치하며 기업가치가 35억 달러로 17개월 만에 약 3배 상승했습니다. 연환산 매출이 3억 7천500만 달러로 12개월간 18배 성장했으며, 이는 AI 랩들의 고품질 학습 데이터에 대한 폭발적 수요 덕분입니다.
AI 학습 데이터 구축 스타트업 스노클 AI(Snorkel AI)가 인사이트 파트너스와 S32 주도로 3억 5천만 달러 시리즈 E 투자를 유치하며 기업가치가 35억 달러로 17개월 만에 약 3배 상승했습니다. 연환산 매출이 3억 7천500만 달러로 12개월간 18배 성장했으며, 이는 AI 랩들의 고품질 학습 데이터에 대한 폭발적 수요 덕분입니다.
생성형 AI(LLM)가 저작권과 라이선스를 무시하고 온라인의 모든 콘텐츠를 학습하면서 40년에 걸쳐 형성된 오픈소스 사회적 계약이 무너지고 있다고 지적하는 글입니다. 개발자 입장에서 코드 공개가 보안 취약점 노출과 AI 봇의 저품질 PR 홍수로 이어지는 등 부담으로 변하면서, 지식 공유가 축복에서 저주가 될 수 있음을 경고합니다.
Anthropic의 15억 달러 저작권 집단소송 합의금이 지급되는 가운데, 이미 권리가 반환된 도서에 대해 출판사들이 지분을 청구하거나 50%만 받을 자격임에도 100%를 요구하는 사례가 다수 보고되고 있습니다. 일부 문학 에이전트도 저작권자가 아님에도 몫을 청구해 작가들의 반발이 일고 있으며, 전문가들은 악의보다는 서류 관리 부실과 복잡한 합의 절차가 원인으로 분석하지만 문제가 광범위·구조적일 가능성을 지적합니다.
미국 언론 404 미디어가 네바다주 라스베이거스의 아마존 VGT3 창고에서 수천 권의 책을 파괴적으로 스캔해 AI 학습 데이터로 사용한다는 사실을 폭로했습니다. 익명의 아마존 직원 인터뷰에 따르면, 창고에서는 책의 등을 절단하고 페이지를 스캔한 뒤 무작위로 섞어 폐기하며, 신간 서적부터 도서관 폐기 도서, 일본·독일·러시아어 책, 심지어 영국 의회 문서까지 다양한 자료가 반입되고 있었습니다.
파산한 저가항공 스피릿항공이 34년치 운영 및 직원 데이터를 구글에 1,000만 달러에 매각하려 하자, 승무원 노조가 개인정보 침해를 이유로 법적으로 반발했습니다. 이 분쟁은 AI 학습용 데이터 확보 경쟁에서 소비자가 아닌 '노동자 데이터' 보호라는 새로운 쟁점을 부각시켰습니다.
여러 AI 기업들이 중개업체를 통해 중고 서적을 대량으로 매입한 뒤 스캔하고 파괴하는 것으로 드러났습니다. Anthropic의 '파나마 프로젝트'는 15억 달러 저작권 합의로 폭로되었으며, 이 과정에서 지식이 사기업 서버에 영구적으로 독점됩니다. 안나스 아카이브(Anna's Archive)는 이 문화유산이 사라지기 전에 전 세계 자원봉사자들이 책을 스캔·업로드할 것을 긴급히 촉구하고 있습니다.
404 Media의 조사에 따르면 아마존이 희귀 도서를 대량 구매해 제본을 잘라내 파괴적으로 스캔한 뒤 AI 학습 데이터로 활용하고 있습니다. 반면 비파괴 방식으로 책을 디지털화하는 인터넷 아카이브는 대기업들의 소송으로 존폐 위기에 처해 있어, 거대 기업과 공공 이익 단체에 대한 상반된 대우가 도마에 올랐습니다.
AI 학습 데이터에 대한 폭발적 수요에 힘입어 데이터 라벨링 스타트업 마이크로1(Micro1)이 8개월 만에 총연 매출 런레이트를 1억 달러에서 5억 달러로 확대했습니다. 순매출 기준 1억 5천만~2억 달러로 여전히 머코어(Mercor, 20억 달러)나 핸드셰이크(Handshake, 10억 달러)보다는 뒤지지만, 시장이 여러 업체를 수용할 만큼 충분히 크다는 점을 보여줍니다.
이번 주 팟캐스트에서는 아마존이 AI 학습 데이터 확보를 위해 대량의 도서를 매입해 파괴하는 에마누엘의 주요 취재를 다룹니다. 또한 ChatGPT로 작성된 전문가 의견서, 법률 서류에 숨긴 프롬프트 인젝션 등 AI 오남용 사례와 메타의 AI 스마트글래스 특허 및 이를 이용한 괴롭힘 연구도 소개합니다.
희귀서적에 숨긴 AirTag 추적 결과, 아마존이 AI 모델 학습을 위해 대량으로 구매한 희귀서적을 스캔한 뒤 파괴하는 것으로 확인됐습니다. 라스베이거스 시설(VGT3)에서 책등을 뜯어 페이지를 스캔하는 전담팀이 운영되고 있으며, ISBN/바코드를 먼저 스캔하도록 훈련받은 점에서 AI 기업들이 ISBN 목록을 따라 전 세계 출간 도서를 체계적으로 스캔하려 한다는 서점 주인들의 추측이 사실로 확인되었습니다.
404 Media의 조사에 따르면 아마존은 서적을 대량으로 구매해 AI 학습 데이터로 스캔한 뒤 원본을 파기합니다. 희귀 도서 상자에 에어태그를 넣어 추적한 결과 라스베이거스 창고의 'VGT3' 팀이 책 등을 잘라 스캔하는 것이 확인됐습니다. 안스로픽(Anthropic)도 유사한 '프로젝트 파나마'를 운영해왔으며, 법원은 원본이 파기된 점을 이유로 저작권 침해가 아니라 판결했습니다.
404 Media가 희귀 서적에 추적 장치를 넣어 배송 경로를 추적한 결과, 대량 구매된 도서의 최종 목적지는 네바다주 라스베이거스의 아마존 물류창고였습니다. 이 시설의 직원들은 대량으로 들어온 책의 제본을 절단해 스캔한 후 파기하는 작업을 하고 있으며, 이는 AI 학습 데이터 확보를 위한 것으로 확인되었습니다. 인쇄된 책은 인터넷에 없는 텍스트를 담고 있고 AI 생성 텍스트 오염이 없어 AI 학습 데이터로 가치가 높아, AI 기업들이 가격에 민감하지 않게 대량 구매하고 있는 것입니다.
책 데이터베이스 기업 ISBNdb가 대량의 종이책을 스캔해 AI 학습 데이터로 판매하려 한다는 단독 보도가 나오자 관련 서비스를 전면 중단했습니다. 이 과정에서 책이 파괴되는 문제와 저작권 침해 우려가 제기되며 윤리적 논란이 불거졌습니다.
Feyn Labs가 HTML 페이지에서 핵심 내용만 빠르고 저렴하게 추출하는 파레토 최적의 AI 모델군인 'Pulpie'를 오픈소스로 공개했습니다. 기존 최고 수준(SOTA) 모델인 Dripper와 비슷한 성능을 내면서도 크기는 1/3, 추론 비용은 1/20 수준으로, 10억 페이지 처리 비용을 약 2,890만 원에서 58억 원으로 대폭 절감할 수 있습니다. 깨끗한 데이터는 언어 모델의 사전 학습 및 추론 성능 향상에 핵심적인 역할을 하므로, 이 모델은 대규모 웹 데이터 처리에 있어 매우 중요한 돌파구가 될 것입니다.
미국 연방 판사는 메타가 '애나의 아카이브(Anna's Archive)'를 통해 불법으로 다운로드하여 AI 모델 학습 데이터로 활용한 혐의에 대해 기각 신청을 기각했습니다. 성인물 제작사인 Strike 3 Holdings의 조사 결과, 메타 소속 IP들이 특정 키워드를 기반으로 조직적으로 토렌트(torrent) 파일을 다운로드한 정황이 명백하게 드러났습니다. 이번 판결은 AI 기업들의 대규모 무단 데이터 수집 관행에 대한 법적 책임을 묻는 중요한 선례가 될 것입니다.
미국 연방법원이 대형 출판사들의 소송을 받아들여 불법 공유 사이트 '安娜의 아카이브(Anna's Archive)'에 1,950만 달러(약 260억 원)의 손해배상과 전 세계 도메인 영구 차단 명령을 내렸습니다. 이 사이트는 단순히 불법 도서를 공유하는 것을 넘어 메타(Meta)와 엔비디아(NVIDIA) 같은 AI 기업들의 핵심 학습 데이터 허브 역할을 해왔다는 점에서 AI 저작권 및 데이터 활용 논쟁에 지대한 영향을 미칠 것으로 보입니다.
사용자가 아이들과 놀기 위해 의미 없는 단어를 입력해 GPT Image 2로 무작위 이미지를 생성했는데, 그 결과물 속에 구글의 'Gemini' 및 'Nano Banana' 워터마크가 함께 그려진 것을 발견했습니다. 이는 타사 AI 모델의 결과물이 학습 데이터로 사용되었을 가능성을 시사하며, 저작권 및 데이터 오염 측면에서 중요한 이슈로 평가됩니다.
메타(Meta)가 자사 AI 모델을 고도화하기 위한 학습 데이터의 새로운 출처로 직원들의 컴퓨터 사용 기록(마우스 움직임, 클릭, 키 입력 등)을 수집할 계획입니다. 이는 AI 모델의 성능을 높이기 위해 실제 인간의 컴퓨터 사용 패턴 데이터가 필요하기 때문이며, 메타는 민감한 정보를 보호하기 위한 안전장치를 마련했다고 밝혔습니다. 이러한 움직임은 내부 업무 데이터와 사내 메신저 기록 등이 AI 학습 데이터라는 새로운 공급망으로 전환되는 AI 업계의 심각한 프라이버시 이슈를 시사합니다.